Índice · Inteligencia Artificial

Inteligencia Artificial

Clase 2 · Agentes, funciones de utilidad, clases de problemas (P vs NP) y formulación de la búsqueda

Fecha: 14 de agosto de 2026

Resumen de la clase

1 Contenido de la clase

El agente como función: percepción y actuación [00:00-01:44]

El profesor retoma el modelo de agente de la clase anterior y lo plantea como una función: recibe la percepción (lo que se obtiene del entorno por los sensores) y produce una acción mediante los actuadores (lo que el agente imprime, guarda, acelera, frena o maneja).

Analogía con un lenguaje de programación: si la percepción es la entrada de una función y el actuador es su salida, entonces "cualquier función que les des es un agente".

La utilidad esperada y la ley de Goodhart [01:44-03:32]

El agente racional maximiza una utilidad esperada, y ahí está gran parte del trabajo: ¿cuál es esa utilidad y cómo la definimos? El profesor advierte con el refrán "hecha la ley, hecha la trampa": cuando se optimiza una medida, el sistema encuentra el atajo que cumple la medida sin cumplir el objetivo real (lo que se conoce como ley de Goodhart). Como la máquina no tiene sentido común, "si ustedes dicen 'maximiza esto', el resultado puede ser extremo".

Ejemplos:

  • Coche autónomo: si defines la utilidad como "máxima seguridad", el óptimo es un coche que nunca se mueve — el más seguro es el que no circula.
  • Problema de diseño urbano (contado de un colega): sobre un terreno irregular se ingresaban medidas (largo, ancho, alto) a la computadora y se obtenían resultados ~80 % mejores que los encontrados a mano. [parte de los detalles de este ejemplo quedaron poco claros en la grabación]

Cuando la utilidad ya está establecida (p. ej. en aplicaciones de visión por computadora donde el pipeline está muy definido) hay menos trabajo; si hay que definir la propia función de utilidad, hay mucho más por hacer.

Del problema a la tabla PEAS [03:32-04:05]

Ante cualquier problema, la idea es completar la tabla PEAS: tipo de agente, indicador(es) de desempeño, ambiente, actuadores y sensores. El profesor insiste: PEAS solo describe de dónde a dónde va el problema (qué información entra y cómo, qué regresa, cómo se medirá el desempeño); no dice nada de cómo se comportará el agente internamente.

Ejemplos de agentes: médico, sensores y recomendación [08:45-26:16]

Agente médico: el ambiente es un hospital. Entradas (sensores): la historia clínica y la interpretación de imágenes médicas. Salidas (actuadores): el diagnóstico, recetar el medicamento, describir cuidados y recomendaciones, llamar a especialistas, etc. [varios pasajes de este diálogo quedaron confusos en la grabación]

Regla práctica de los sensores: por cada cosa del ambiente que quieras observar necesitas al menos un sensor (puede haber varios midiendo lo mismo; p. ej. un coche autónomo con tres cámaras: izquierda, derecha y central, que se dedican a medir el ambiente).

Análisis de tendencias / recomendación: identificar las tendencias es una cosa; el actuador sería otra (generar un reporte o PDF, enviar notificaciones, devolver una predicción con un descuento, etc.). [parte del ejemplo quedó poco clara]

Tipos de agentes: los agentes por reflejo [27:55-44:12]

Objetivo del curso: estudiar técnicas de IA para una variedad de problemas (~20-30 casos) y aprender a reconocer qué técnica conviene según las características del problema y del ambiente (observable, conocido, determinista, etc., vistas la semana anterior). Como los problemas reales casi nunca se resuelven con una pieza de código directa que funcione el 100 % de las veces, se necesita el mecanismo de "inteligencia" entendido como maximizar una utilidad esperada.

Agente por reflejo: percibe y actúa de inmediato según lo percibido; es "algo así como el cuarto chino": con el libro de reglas, para cada entrada sale la respuesta. Muchos modelos clásicos son en la práctica agentes por reflejo: "pónganse su algoritmo favorito de estadísticas"; al final le das la entrada y solo hace suma de multiplicaciones (regresión). Lo mismo una red neuronal o un modelo de lenguaje que genera texto token a token. El entrenamiento es otra historia; el resultado final, en tiempo de uso, es un agente por reflejo.

Frente a esto están los agentes que piensan las consecuencias: considerar qué pasará si voy a la izquierda o a la derecha. Las consecuencias de las acciones son importantes y son la base de los agentes basados en búsqueda.

Panorama de los sistemas de IA [44:12-48:44]

  • Búsqueda (lo primero): un espacio de estados, una función sucesor y una prueba de meta. Primeros algoritmos: búsqueda en anchura, búsqueda en profundidad y búsqueda de costo uniforme.
  • Algoritmos evolutivos: también son búsqueda/optimización. La separación de la "inteligencia computacional" fue histórica (años 80, cuando la IA se asociaba a sistemas simbólicos "exactos"); el chiste de que un título con "evolutivo" era rechazado en las conferencias de IA. Hoy se reconoce que muchos algoritmos aceptados son evolutivos con otro nombre. Casi todo problema de optimización (minimizar una pérdida, regresiones) cae en el corazón de la búsqueda/optimización.
  • Sistemas lógicos: lógica proposicional, de primer orden, temporal, no monotónica; aplicaciones: diagnóstico médico, asesores, demostradores de teoremas. Hoy los LLM pueden traducir lenguaje natural a lenguaje formal, razonar y volver a traducir el resultado.
  • Sistemas probabilísticos: el mundo es incierto; basados en el teorema de Bayes; se razona con lo que se sabe y lo que no se sabe para llegar a la respuesta más probable. Aplicaciones: recomendación, robótica, causalidad, regresión.
  • Aprendizaje (lo más de moda): a partir de datos se produce una salida que se parezca lo más posible a la deseada; se encuentran patrones y se aprende con una señal de recompensa (aprendizaje por refuerzo); se da un grado de confianza y se emiten predicciones o etiquetas. Las redes neuronales aparecen en varias categorías: los límites entre áreas no son rígidos.

Optimización, preguntas de decisión y clases de complejidad [60:26-65:00]

Muchos problemas se pueden plantear como optimización o como decisión. Ejemplo: encontrar la mejor ruta de aquí al Politécnico (optimización) se puede responder con preguntas de decisión —"¿existe una ruta de menos de 20 minutos?", "¿de 15?", "¿de 20?"— reduciendo el intervalo, como en una búsqueda binaria.

Repaso de clases de complejidad para quien no llevó un curso de computación:

  • P: problemas resolubles en tiempo polinomial (el tiempo de cómputo crece como un polinomio del tamaño de la entrada) en una máquina determinista.
  • NP: problemas cuya solución se puede verificar en tiempo polinomial; la "N" viene de no determinista: se pueden evaluar varios caminos a la vez (en la práctica solo se simula).
  • NP-completo: está en NP y cualquier problema de NP se reduce a él en tiempo polinomial. Si uno de estos se resolviera en polinomial, todos los de NP se resolverían en polinomial.
  • NP-difícil (NP-hard): cumple la parte de la reducción pero no se exige que esté en NP.

P vs. NP: no se sabe si son iguales; la creencia es que P ≠ NP (uno de los problemas abiertos más famosos de la computación). En la práctica se resuelven problemas NP-difíciles con algoritmos que funcionan bien en casos específicos, sin garantía polinomial óptima.

Formulación de la búsqueda y ejemplos [65:06-81:52]

Un problema de búsqueda se formula con cinco elementos: estado inicial, acciones (con su costo), modelo de transición (función sucesor), prueba de meta y costo de camino. Es una representación muy general (ciudades, planificación: "me levanto a las 8, ¿cómo llego a las 10?"); la solución es una secuencia de acciones (el camino), no solo el estado meta. Al visitar/expandir un nodo se generan sus sucesores y hay que decidir a cuál ir.

Ejemplo del libro (Russell y Norvig): el mapa de Rumania — estado inicial Arad, meta Bucarest, función sucesor con las ciudades vecinas (Sibiu, Timișoara, Zerind) y costos en kilómetros. El profesor comenta que algunos estudiantes han usado mapas de México, pero el ejemplo del libro es este.

Ejemplo del 8-puzzle: tablero 3×3 con fichas 1-8 y un espacio en blanco; el objetivo es ordenar las fichas (1,2,3,...,8 y el blanco). El espacio de estados son todas las configuraciones: 9·8·7·...·1 = 9! (362 880). Matiz importante: por una propiedad de paridad, desde un estado dado solo se alcanza la mitad de esas configuraciones (9!/2 = 181 440); el resto forma un componente desconectado. Estado inicial = la configuración desordenada; prueba de meta = el estado ordenado.

Árbol de búsqueda: la raíz es el estado inicial y los hijos son los sucesores. En el 8-puzzle el blanco se mueve en 4 direcciones (arriba, abajo, izquierda, derecha), así que desde el inicio se generan hasta 4 estados y de cada uno se sigue expandiendo.

El tamaño del árbol depende de dos factores: el factor de ramificación (cuántos sucesores tiene cada nodo; en el 8-puzzle es como máximo 4) y la máxima profundidad (se hablará después). El árbol es enorme incluso para problemas pequeños. [el análisis numérico final de alturas/árboles quedó poco claro en la grabación]

2 Puntos destacados / Lo que hay que saber

Agente = función: percepción (entrada) → acción (salida); PEAS describe entrada, salida y desempeño, no el comportamiento interno [00:00-04:05].
Regla del sensor: al menos un sensor por cada aspecto del ambiente que quieras observar [24:21-25:28].
Ley de Goodhart ("hecha la ley, hecha la trampa"): cuando una medida se convierte en objetivo, deja de ser una buena medida; ejemplo: el coche más seguro es el que nunca se mueve [01:53-03:13].
Agente por reflejo: percibe y actúa al instante; los modelos entrenados (regresión, redes neuronales, LLM) son en la práctica agentes por reflejo [42:04-42:44].
Orden del curso: búsqueda → lógica → probabilidad (IA tradicional); después lo moderno (aprendizaje) [44:12-44:26].
Búsqueda = espacio de estados + función sucesor + prueba de meta; primeros algoritmos: anchura, profundidad, costo uniforme [44:53-45:11].
Algoritmos evolutivos son búsqueda/optimización; la separación de la "inteligencia computacional" fue histórica (años 80) [45:21-45:50].
P = resoluble en tiempo polinomial · NP = verificable en polinomial · NP-completo = en NP + todo NP se reduce a él · NP-difícil = sin exigir estar en NP [61:47-64:35].
P vs. NP: problema abierto; se cree P ≠ NP [64:05-64:17].
Optimización ↔ decisión: la mejor ruta se encuentra con preguntas tipo "¿existe ruta de < X minutos?" (búsqueda binaria) [60:33-61:00].
Ejemplos: mapa de Rumania (Arad → Bucarest) y 8-puzzle (9! configuraciones, solo 9!/2 = 181 440 alcanzables por paridad; factor de ramificación máximo 4) [67:37-69:14].
Tamaño del árbol de búsqueda → factor de ramificación × máxima profundidad [80:07-80:51].

3 Actividades y tareas pendientes

No se dejó ninguna tarea con fecha de entrega en esta sesión (fue una clase teórica de conceptos). El profesor anunció que la próxima sesión se empezará con los algoritmos de búsqueda (anchura, profundidad, costo uniforme) y ejemplos del libro.

Checklist sugerido a partir de lo explicado:

Próxima sesión: primeros algoritmos de búsqueda (anchura, profundidad, costo uniforme).

4 Dudas que podrían examinar

¿Qué es un agente por reflejo?

Un agente que percibe y actúa de inmediato según lo percibido, sin planear: una función directa de entrada a salida (como el cuarto chino). Muchos modelos entrenados se comportan así en tiempo de uso.

¿Por qué el coche autónomo más "seguro" es el que no se mueve?

Porque si la función de utilidad se define solo como "máxima seguridad", el óptimo trivial es no circular. Es una muestra de cómo una utilidad mal definida produce soluciones absurdas.

¿Qué es la ley de Goodhart?

Que cuando una medida se convierte en el objetivo a optimizar, deja de ser una buena medida del objetivo real ("hecha la ley, hecha la trampa"). Es clave al diseñar funciones de utilidad.

¿Cuál es la diferencia entre P y NP?

P son los problemas que se resuelven en tiempo polinomial; NP son los que se pueden verificar en tiempo polinomial. No se sabe si son iguales (se cree que no).

¿Qué significa que un problema sea NP-completo?

Que está en NP y que cualquier problema de NP se puede reducir a él en tiempo polinomial. Si se resolviera uno en polinomial, P = NP.

¿Qué es NP-difícil y en qué se diferencia de NP-completo?

NP-difícil solo exige que todo problema de NP se reduzca a él; no se exige que esté en NP. NP-completo = NP-difícil + está en NP.

¿Cómo se convierte un problema de optimización en preguntas de decisión?

Preguntando por el valor óptimo de forma acotada ("¿existe una ruta de menos de X minutos?") e ir reduciendo el intervalo, como en la búsqueda binaria.

¿Cuáles son los componentes de un problema de búsqueda?

Estado inicial, prueba de meta y función sucesor (más los costos). Sobre ellos se construye el árbol de búsqueda.

¿Qué es el factor de ramificación?

Cuántos sucesores genera cada nodo; junto con la máxima profundidad determina el tamaño del árbol de búsqueda. En el 8-puzzle es como máximo 4.

5 Sitios o recursos para visitar

El profesor no dio URLs ni herramientas concretas en esta sesión; remitió al libro y al material del curso. Recursos útiles para profundizar:

6 Glosario de términos

  • Agente por reflejo: agente que percibe y actúa de inmediato según lo percibido, sin planear (una función entrada → salida).
  • Función de utilidad: medida que el agente racional maximiza; definirla mal produce resultados absurdos (ley de Goodhart).
  • Ley de Goodhart: cuando una medida se convierte en el objetivo a optimizar, deja de ser una buena medida del objetivo real.
  • PEAS: marco de diseño del agente: Performance (desempeño), Environment (ambiente), Actuators (actuadores), Sensors (sensores).
  • Agente: entidad (o función) que recibe percepciones y produce acciones mediante actuadores.
  • Problema de búsqueda: estado inicial + prueba de meta + función sucesor (+ costos).
  • Espacio de estados: conjunto de todas las configuraciones válidas del problema (p. ej. las 9! del 8-puzzle, de las que solo 9!/2 = 181 440 son alcanzables desde un estado dado por paridad).
  • Paridad (8-puzzle): propiedad que divide el espacio de estados en dos mitades desconectadas: desde un estado solo se alcanza la mitad de las 9! configuraciones.
  • Factor de ramificación: número de sucesores que genera cada nodo; determina (con la profundidad) el tamaño del árbol.
  • P: clase de problemas resolubles en tiempo polinomial en una máquina determinista.
  • NP: clase de problemas cuya solución se puede verificar en tiempo polinomial.
  • NP-completo: está en NP y todo problema de NP se reduce a él en tiempo polinomial.
  • NP-difícil (NP-hard): todo NP se reduce a él, pero no se exige que esté en NP.
  • Reducción polinomial: transformación de un problema en otro que conserva las respuestas (sí/no) en tiempo polinomial.
  • Teorema de Bayes: base de los sistemas probabilísticos para razonar con incertidumbre y obtener la respuesta más probable.
  • Búsqueda binaria: técnica de reducir a la mitad el intervalo de búsqueda; conecta problemas de decisión con optimización.

7 Mapa mental textual

  • Inteligencia Artificial · Clase 2 (agentes, utilidad, complejidad y búsqueda)
    • Agente como función
      • Percepción (sensores) → acción (actuadores) · PEAS
      • PEAS describe entrada/salida/desempeño, no el comportamiento interno
      • Regla: al menos un sensor por aspecto del ambiente
    • Función de utilidad
      • Maximizar utilidad esperada · definirla bien es lo difícil
      • Ley de Goodhart: medida → objetivo → deja de ser buena medida
      • Ejemplo: coche autónomo "máxima seguridad" = no moverse
    • Tipos de agentes
      • Por reflejo: percibir → actuar (regresión, redes neuronales, LLM)
      • Que piensan consecuencias (base de la búsqueda)
    • Panorama del curso
      • Búsqueda (anchura, profundidad, costo uniforme) · lógica · probabilidad
      • Evolutivos = optimización (separación histórica) · aprendizaje (lo moderno)
    • Clases de complejidad
      • P ⊂ NP · NP-completo = en NP + reducible · NP-hard sin estar en NP
      • P vs NP abierto · se cree P ≠ NP
      • Optimización → preguntas de decisión (búsqueda binaria)
    • Búsqueda
      • Estado inicial → función sucesor → prueba de meta → árbol de búsqueda
      • Ejemplos: mapa de Rumania (Arad→Bucarest) · 8-puzzle (9!, ramificación ≤ 4)
      • Tamaño del árbol = ramificación × profundidad

Notas de estudio